AI Agents
AI Agent 可以理解为:基于大语言模型的可行动系统。它不只是“会聊天的模型”,而是能够在目标约束下,调用工具、读取环境、维持状态,并持续迭代直到完成任务的系统。
理解 AI Agent,可以记住一句话:感知环境,形成判断,调用工具,拿反馈继续迭代。
也可以压缩成 4 个词:感知 -> 决策 -> 执行 -> 反馈。
在生产系统里,你还需要一层“护栏(Guardrails)” ——边界
Agent 是一个系统:它接收目标而非指令,自主控制"感知 → 推理 → 行动"的循环,直到满足成功标准或触发终止条件。
自主性无法填补事实缺口,Agent 只能在已知信息的范围内自主行动
为什么 AI Agent 重要
普通 LLM 更像“单轮回答机器”,而 Agent 更接近“持续完成任务的工作单元”。
当任务需要下面这些能力时,Agent 才真正有价值:
- 任务不是一句话就能完成,而是要分多步推进。
- 需要调用浏览器、终端、搜索、数据库、代码执行等外部工具。
- 需要根据中途结果调整后续策略,而不是一次性输出答案。
- 需要保留状态、上下文、用户偏好或环境信息。
这也是为什么 AI Agent 常被用在 coding agent、research agent、OS agent、自动化工作流和企业助理等场景中。
一个更容易理解的心智模型
如果把 Agent 看成一个“AI 员工”,它大致由 5 个部分组成:
1. 目标
系统先要知道“要完成什么”。目标可以来自用户提示、任务单、工单、环境事件或上一步任务结果。
2. 大脑
通常由 LLM 或 MLLM 负责理解任务、做局部推理、选择下一步动作。
3. 手和脚
也就是工具层,例如:
- 搜索
- 浏览器操作
- 代码执行
- 文件系统读写
- 数据库查询
- 调用外部 API
4. 记忆
包括短期上下文、长期记忆、用户偏好、历史执行记录和中间状态。
5. 反馈回路
Agent 每完成一步,就根据结果判断:
- 是否完成了目标
- 是否需要修正计划
- 是否要换工具、换模型、重试或终止
这一层决定了 Agent 和普通问答系统的核心区别。Agent 的本质不是“回答得更像人”,而是“会围绕目标持续行动”。
AI Agent 与普通 Chatbot 的区别
| 维度 | 普通聊天模型 | AI Agent |
|---|---|---|
| 目标持续性 | 通常单轮 | 多轮持续推进 |
| 工具使用 | 有时调用 | 工具调用是核心能力 |
| 状态管理 | 弱 | 强,常带记忆与任务状态 |
| 结果形态 | 回答 | 行动、产物、任务完成 |
| 失败处理 | 直接结束 | 会重试、改计划、回退 |
一句话说:Chatbot 重点在回答,Agent 重点在完成。
AI Agent 的关键组成
1. 规划与编排
当任务复杂时,Agent 往往要先分解问题,再决定调用顺序与执行策略。
其中一个重要理解是:人的工作重心会从“亲自解题”,转向“设计一个让 Agent 能持续逼近正确答案的环境”,除了运行环境本身,甚至可以借助“社区化”,让 Agent 在一个好的社区环境中持续自主进化,比如:让你的 AI Bot 去上学。
2. 模型与路由
Agent 系统往往不只用一个模型,而是按任务类型、成本、延迟和质量要求进行分配。
相关笔记:
如果说模型是“大脑”,那么路由系统就是“大脑调度器”。
3. 工具接入
Agent 的可用性很大程度取决于它能调用哪些工具、工具是否可靠、接口是否清晰。
相关笔记:
4. 治理与护栏
一旦 Agent 具备执行能力,就必须考虑权限边界、输入输出控制、内容安全、失败回滚和审计问题。
相关笔记:
5. 观测与评估
Agent 不是“做出来就行”的系统,它的成本、成功率、步骤数、重试路径、失败原因都需要被追踪和评估。
如果没有观测,Agent 系统就会很快变成不可调试的黑箱。
当前最值得关注的几类 Agent
1. Coding Agent
让 Agent 参与代码理解、修改、测试、重构与调试。
相关笔记:
2. OS Agent
直接操作电脑、手机或浏览器环境,通过视觉和工具执行任务。
这类方向在 2025 年开始明显升温,典型特征是:
- 多模态输入
- GUI 操作
- 长任务执行
- 更高的不确定性和失败率
3. Research Agent
帮助人做检索、筛选、总结、引用整理和研究报告生成。
4. Workflow Agent
接在业务流程里做自动化,例如客服、销售、内容运营、内部知识系统、审批流与数据处理。
5. Personal Assistant / Workflow Agent(OpenClaw)
OpenClaw 更属于个人助理型 Agent 与 Workflow Agent 的结合体,而不是一个纯粹的 OS Agent。
为什么这样判断:
- 它的官方定位首先是“运行在你自己设备上的个人 AI 助手”。
- 它强调的是 multi-channel gateway:把 WhatsApp、Telegram、Discord、iMessage 等聊天入口接到同一个 Gateway。
- 它的核心价值主张是本地优先、可持续在线、可保留会话与记忆、可接入多种工具和技能。
- 它虽然也具备浏览器、节点、Canvas、系统工具等能力,但这些更像执行手段,而不是它的唯一产品定位。
OpenClaw 不是那种“只会操作电脑界面”的 OS Agent,而是一个以个人助理和工作流自动化为核心、再向外扩展多工具与多入口能力的 agent 产品。
研究信号与代表案例
OS Agent Survey
- 论文仓库:OS Agent Survey
- 主题:面向电脑、手机和浏览器环境的 MLLM Agent 综述
- 意义:适合快速建立 OS Agent 的全景认识
MarsCode Agent
- 论文:MarsCode Agent: AI-native Automated Bug Fixing
- 主题:自动化 Bug 修复
- 意义:说明 Agent 已经从“聊天式辅助”走向“面向结果的研发流程自动化”
Claude Think Tool
- 链接:Claude Think Tool
- 主题:让模型在执行中显式停下来思考
- 意义:反映出 Agent 系统正在强化中间推理与过程控制能力
现阶段的典型问题
AI Agent 很强,但也还远没有稳定到“可放心托付一切”。现阶段常见问题包括:
- 长任务漂移:执行几步后偏离目标
- 工具脆弱:工具一变,Agent 就容易失效
- 上下文污染:错误状态被持续继承
- 成本不可控:步骤多、调用多、重试多
- 评估困难:很难稳定定义“成功”与“失败”
- 可解释性弱:知道结果错了,但难以定位哪一步错了
所以对 Agent 的判断不能只看 demo,而要看:
- 任务成功率
- 工具稳定性
- 可观测性
- 权限边界
- 人类介入成本
怎样更系统地学习 AI Agent
如果把这块内容作为长期主题,比较推荐的阅读顺序是:
- 先建立总览
- 再理解系统底层
- 最后看具体实现与案例
- Katanemo Plano 深度分析
- 源码分析 agent-browser
- 基于 lark-console 初步实现 agent-ace
- Pi - 极简 AI 编码框架
- AI Infra in Rust
一个适合记忆的总结
AI Agent 不是一个单独的模型,而是一套围绕任务目标组织起来的系统。
它真正困难的地方,不是“模型够不够聪明”,而是下面这些系统问题:
- 任务如何拆解
- 模型如何路由
- 工具如何接入
- 状态如何保存
- 错误如何回退
- 全链路如何观测
所以理解 AI Agent,最好的方式不是只研究 prompt,而是把它当成“一个由模型、工具、状态、策略和反馈回路共同组成的任务系统”去看。
相关阅读
- AI Agents/Index
- 代理编排(Outer Loop)
- LLM 路由
- AI原生代理数据平面
- Filter Chains 过滤链
- 可观测性与追踪(OpenTelemetry)
- Katanemo Plano 深度分析
- AI Infra in Rust
- AI for Software Engineering
参考资源
- OS Agent Survey: https://github.com/OS-Agent-Survey/OS-Agent-Survey
- MarsCode Agent: https://arxiv.org/abs/2409.00899
- Claude Think Tool: https://www.anthropic.com/engineering/claude-think-tool
- OpenClaw Docs: https://docs.openclaw.ai/index
- OpenClaw FAQ: https://docs.openclaw.ai/help/faq
- 第 1 章:Agent 的本质 | AI Agent 开发实战